百度搭子 百度短视频生成(baidu-video-gen):一句话生成成片,完整指令模板

先说结果
打开 DuMate 说一句"帮我生成一段 15 秒的护肤产品展示视频,画面从空中俯瞰产品瓶身,镜头缓缓推进",AI 就能自动完成分镜拆解→参考图生成→视频片段生成→合并成片的全流程。你不需要写任何代码、不需要懂技术参数,全程用自然语言指令驱动,所有关键节点 AI 会主动向你确认。本文给你一套完整的话术模板,复制粘贴就能用。
一、短视频赛道为什么值得做
2024 年抖音日活突破 8 亿,视频号月活 13 亿,短视频已经成为内容传播的主战场。一条优质短视频的获客成本,只有图文内容的 1/5。但传统视频制作门槛高:写脚本、找素材、拍摄、剪辑、配音、加字幕,一条 30 秒的视频动辄需要 2-4 小时。
百度搭子内置的 baidu-video-gen 技能,把"创意→成片"的链路彻底重构:你只需要一句话描述或一张参考图,剩下的全部交给 AI。不是"辅助剪辑",是从分镜规划、参考图生成、视频片段合成到最终合并的全流程自动化。
最关键是:你不需要学任何技术命令。DuMate 会在对话中引导你完成每一步,你只需要说人话。本文给你一套可以直接复制粘贴到 DuMate 对话框的指令模板。

二、百度短视频生成:5 步从创意到成片
百度短视频生成(baidu-video-gen)的工作流包含 5 个核心阶段,每个阶段 DuMate 都会主动告诉你当前进度:
① 描述创意:你告诉 DuMate 视频主题、画面描述、时长要求。→ 产出:任务 ID + 结构化创意方案。
② 分镜拆解:DuMate 自动拆分画面描述为多个分镜(通常 1-3 个),每个分镜包含画面、动作、对白/旁白、音效。→ 产出:完整分镜方案表。
③ 生成参考图:根据分镜方案,生成首帧图、尾帧图或通用参考图,锚定画面风格。→ 产出:视觉资产。
④ 逐镜生成视频:基于分镜和参考图,串行提交每个分镜的视频生成任务。→ 产出:每个分镜对应的视频片段。
⑤ 合并成片:把所有视频片段按分镜顺序合并,自动配音、加字幕,输出最终成片。→ 产出:完整短视频文件。
三、实操第一步:描述你的创意
短视频生成的起点是一段文字描述。描述越具体,生成效果越好。以下是不同场景的话术模板:
场景 A:纯文生视频(没有参考图)
帮我生成一段 10 秒的产品展示视频,横屏 16:9。
画面描述:一瓶护肤品放在纯白色背景上,镜头从远处缓缓推进,光线柔和,瓶身有轻微旋转展示标签。
要求:不要人物出镜,不要字幕,配上舒缓的背景音乐。
场景 B:图生视频(有参考图)
我上传了一张产品图,请基于这张图帮我生成一段 8 秒的动态视频。
动作要求:图片中的产品缓慢旋转 360 度,背景有柔和的光影流动。
比例:竖屏 9:16,适合发抖音。
场景 C:脚本转视频(有详细脚本)
请帮我把下面的内容转成视频:
【镜1】清晨,一杯热咖啡放在窗台上,蒸汽缓缓升起,时长 5 秒。
【镜2】镜头转到窗外,城市天际线在晨光中逐渐明亮,时长 5 秒。
【镜3】回到桌面,一只手拿起咖啡杯,特写杯身上的品牌 Logo,时长 5 秒。
旁白(女声):每一个清晨,都值得被温柔对待。
要求:横屏 16:9,添加字幕,配上轻音乐。
描述技巧:
• 时长:明确说"10 秒""15 秒",DuMate 会自动拆分合理的分镜时长(每个分镜 3-15 秒)。
• 比例:横屏 16:9(适合 B 站/视频号)、竖屏 9:16(适合抖音/快手)、方形 1:1(适合小红书)。不指定时默认 16:9。
• 主体:如果视频中出现同一个人/物品,说明"保持主体一致",DuMate 会自动开启主体一致性。
• 音频:需要旁白/对白时说明"添加字幕"和"配音",不需要时说"纯画面,无对白"。

四、实操第二步:分镜方案确认
收到你的描述后,DuMate 会输出分镜方案表和生成配置表,弹窗让你确认。这是关键决策点——确认后 AI 才会开始消耗积分生成内容。
分镜方案表包含:每个分镜的画面、动作、对白/旁白、音效、时长、主体、首帧来源、尾帧来源。
生成配置表包含:主体一致性开关、主体描述、字幕开关、旁白音色。
你需要检查的关键项:
• 时长:总时长是否符合预期?单个分镜是否太长(超过 15 秒会被拆,但建议保持精简)?
• 画面:每个分镜的"画面"列是否准确描述了你想要的东西?
• 主体:如果视频中有重复出现的人/物(比如同一个产品、同一个角色),检查"主体一致性"是否开启。
• 对白 vs 旁白:同一分镜中只能有"角色对白"或"旁白"之一,不能同时出现。如果表格里同时出现了,DuMate 会自动拆成两个分镜。
• 音色:旁白音色四选一——温柔女声(适合抒情/生活)、年轻男声(适合资讯/纪录)、磁性男声(适合悬疑/都市)、甜美女声(适合萌系/恋爱)。不指定时默认温柔女声。
确认方案后,DuMate 会自动进入下一步。如果你想修改,直接在对话里说"第 2 个分镜的画面改成..."即可。
五、实操第三步:参考图与主体设定
分镜确认后,DuMate 会进入参考图阶段。参考图的作用是"锚定画面"——让 AI 知道视频应该以什么风格、什么构图、什么主体来生成。
三种参考图类型:
• 首帧图(first_frame_image):锁定视频开头的画面。适合"我想让视频从某个特定画面开始"的场景。
• 尾帧图(last_frame_image):锁定视频结尾的画面。适合"视频收尾必须是这个画面"的场景。
• 通用参考图(reference_image):贯穿整段视频的风格锚点。适合"基于这张图的风格/主体生成整段视频"的场景。
你不需要手动选择参考图类型——DuMate 会自动判断:
• 如果你有上传的参考图,DuMate 会把它同时用于"首帧"和"主体锚点"(通用参考)。
• 如果你只给了文字描述,DuMate 会自动为需要文字/Logo/品牌名的分镜生成参考图。
• 如果是连续分镜(同一个场景延续),第 2 个分镜会自动继承第 1 个分镜的尾帧作为首帧,画面无缝衔接。
主体一致性:如果多个分镜中出现了同一个主体(比如同一个女孩、同一瓶护肤品),DuMate 会自动开启"主体一致性"。开启后,AI 会在所有分镜中保持该主体的外观一致——避免"第一镜是短发女孩、第二镜变成长发女孩"的尴尬。
如果参考图不满意? 直接告诉 DuMate:"第 1 个分镜的首帧图换成..."或"帮我把主体的外观改成..."——DuMate 会自动重新生成,不消耗额外积分。
六、实操第四步:视频生成与合并
参考图确认无误后,DuMate 会弹窗问你"是否开始生成视频?"——选择确认后,DuMate 会自动串行提交每个分镜的视频生成任务(必须等前一个分镜完成才能提交下一个)。
视频生成通常需要 10-30 分钟(取决于分镜数量和时长)。DuMate 会自动轮询进度,并在每个分镜完成后通知你:
• "分镜 1/3 视频生成完成 ✓"
• "分镜 2/3 仍在生成中,继续等待..."
• "分镜 3/3 视频生成失败,跳过"(某个分镜失败不影响其他分镜继续)
所有分镜完成后,DuMate 会自动调用合成脚本,拼接视频片段、混音、烧录字幕,输出最终成片。
合并完成后,DuMate 会在对话中展示最终视频文件路径,你可以直接下载。
如果某个分镜效果不满意? 直接告诉 DuMate:
第 2 个分镜的视频效果不好,请帮我重新生成。
新的画面描述:镜头从侧面缓缓环绕产品旋转,背景保持纯白色,光线从左侧打入形成柔和阴影。
DuMate 会自动处理:归档旧视频 → 重新生成 → 自动合并新版本 → 交付新成片。你不需要做任何技术操作。
七、5 个避坑要点:用 DuMate 做短视频必须注意

① 描述尽量具体。"帮我生成一个产品视频"太笼统,生成效果会随机。建议说"帮我生成一段 10 秒的护肤品视频,横屏,产品放在纯白背景上,镜头从远处缓缓推进,光线柔和"——描述越具体,结果越可控。
② 参考图阶段务必仔细审阅。视频生成阶段每 1 秒消耗积分(具体数额取决于配置),如果画面风格不对或主体外观有问题,视频生成后返工成本较高。参考图阶段修改是"低成本"的——告诉 DuMate 改就行。
③ 单个分镜不超过 15 秒。DuMate 会自动拆分,但如果你的描述里某个动作特别长(比如"镜头环绕旋转 20 秒"),建议自己先拆成"先推进 5 秒,再环绕 5 秒,最后特写 5 秒"三个分镜,效果更好。
④ 对白和旁白不要同时出现在一个分镜。这是 baidu-video-gen 的硬性规则——如果一个镜头里既有角色说话又有画外音,DuMate 会自动拆成两个连续分镜。你在描述时可以直接拆好,避免 AI 拆分后的节奏不符合预期。
⑤ 续集或系列视频在同个对话里生成。第 1 条视频生成完后,直接在同一个对话里说"继续生成第 2 条,保持同样的产品主体",DuMate 会自动复用之前的角色/主体设定和风格参考,保持视觉一致性。
八、总结
百度短视频生成(baidu-video-gen)把短视频制作从"剪辑软件+ hours"压缩到"1 句话+ 20 分钟"。核心价值不是替代创意,是把"技术执行"全部自动化——让你从"找素材、调参数、盯渲染"中解放出来,把时间花在"选题策略"和"内容打磨"上。
本文给出的所有指令都可以直接复制粘贴到 DuMate 对话框使用,不需要任何技术背景。建议先选一个 10 秒的产品展示试跑一遍——跑通一次后,你就有了一套可复用的短视频生产线。
现在就打开 DuMate,把第三部分的任意一条指令复制粘贴发送——3 分钟后你会看到第一份 AI 分镜方案。